← 목록으로
147 RAG_기초
목록English

147 RAG_기초

RAG 기초는 LangChain·LlamaIndex·벡터DB를 활용해 문서에서 근거를 검색하고 신뢰도 높은 답변을 생성하는 기본 파이프라인을 구현하는 과정이다.

0. 교육을 하는 이유와 궁극적인 목표

RAG 기초 교육의 궁극적인 목표는 학습자가 LLM의 환각 문제를 줄이기 위해 조직 문서, 교육자료, 매뉴얼을 검색 가능한 지식원으로 변환하고, 검색 결과를 근거로 답변하는 문서 QA 시스템을 구현·평가할 수 있게 하는 것이다. 유료 생성형 AI 앱 제작 과정처럼 문서 전처리, 임베딩, 벡터DB, 검색 튜닝, 출처 표시, 품질평가를 프로젝트 중심으로 다룬다.

참고한 유료형 교육 흐름

  • LangChain·Ollama 기반 챗봇, RAG, AI Agent를 통합 구축하는 실무형 유료 과정 흐름
  • RAG 프로세스, 임베딩, FAISS, prompt template을 다루는 AI agent 교육 흐름
  • LlamaIndex와 LangChain을 비교하며 문서 색인과 검색 품질 개선을 다루는 개발자 과정
  • 기업 문서 QA 챗봇에서 출처 표시, 권한, 평가 질문셋을 강조하는 전문 컨설팅 교육 방식
입문 · 1일

RAG 개념과 검색 기반 답변 입문

LLM이 문서를 검색해 근거 있는 답변을 만드는 과정을 이해한다.

구분세부 내용실천·실습 방법
목표 1RAG 흐름을 설명한다
질문, 문서 분할, 임베딩, 벡터검색, 프롬프트 결합, 답변 생성 단계를 순서도로 그린다.
일반 LLM 답변과 문서 근거 포함 답변을 비교해 환각 감소 원리를 토론한다.
목표 2문서를 작은 조각으로 나눈다
PDF와 TXT 문서를 문단, 제목, 페이지 기준으로 chunking하고 chunk size 차이를 비교한다.
문서 구조가 깨진 사례를 찾아 표, 목록, 머리말을 보존하는 전처리 규칙을 만든다.
목표 3검색 결과를 확인한다
간단한 임베딩 모델로 문서를 벡터화하고 질문과 가까운 문단을 출력한다.
검색된 문단이 실제 답변 근거가 되는지 체크리스트로 검수한다.
사용 플랫폼Python, Google Colab, LangChain, sentence-transformers, FAISS, Chroma, PyPDF
강사 스펙RAG 기본 구조, 문서 전처리, 임베딩 검색 지도 경험 3년 이상
수업대상생성형 AI 입문자, 문서 QA 챗봇을 만들고 싶은 교사·실무자
소요시간4-6시간
준비물샘플 PDF/TXT 문서, Colab 계정, RAG 순서도 템플릿, 질문 예시
산출물RAG 구조도, 문서 chunking 비교표, 검색 근거 검수표
평가방법구조이해 30%, 전처리 25%, 검색실습 25%, 검수표 10%, 참여도 10%
초급 · 3일

LangChain 기반 RAG 구현 과정

LangChain으로 문서 업로드형 질의응답 파이프라인을 만든다.

구분세부 내용실천·실습 방법
목표 1문서 로더를 구성한다
PyPDFLoader, TextLoader, CSVLoader를 사용해 자료 유형별 로딩 코드를 작성한다.
RecursiveCharacterTextSplitter로 chunk size와 overlap을 바꿔 검색 품질 차이를 확인한다.
목표 2벡터DB를 구축한다
FAISS와 Chroma에 임베딩을 저장하고 persist directory를 설정한다.
질문별 top-k 검색 결과를 표로 출력해 검색 누락과 중복을 분석한다.
목표 3답변 체인을 만든다
retriever와 prompt template을 연결해 근거 문단 기반 답변을 생성한다.
답변에 출처 문서명, 페이지, chunk 번호가 표시되도록 출력 형식을 설계한다.
사용 플랫폼Python, LangChain, FAISS, Chroma, Hugging Face Embeddings, OpenAI 또는 Ollama, Streamlit
강사 스펙LangChain RAG 체인, 벡터DB 저장, 출처 표시형 QA 구현 경험 3년 이상
수업대상Python 기초 가능자, 챗봇 개발 입문자, 기업 문서 자동화 담당자
소요시간12-18시간
준비물PDF/CSV/TXT 문서 묶음, API 키 또는 Ollama 환경, VS Code, Streamlit 기본 템플릿
산출물LangChain RAG 노트북, 벡터DB 폴더, 출처 표시형 QA 화면
평가방법문서로딩 25%, 벡터DB 30%, 답변체인 25%, 출처표시 10%, 발표 10%
초급 · 1주

RAG 품질평가와 개선 과정

검색 정확도와 답변 신뢰도를 측정하고 개선한다.

구분세부 내용실천·실습 방법
목표 1평가 질문 세트를 만든다
정답이 문서에 있는 질문, 없는 질문, 여러 문서가 필요한 질문을 분리해 30문항을 설계한다.
질문별 기대 근거 문단과 허용 답변 기준을 평가표에 작성한다.
목표 2검색 품질을 개선한다
chunk size, overlap, top-k, embedding model을 바꿔 검색 성공률을 비교한다.
BM25 키워드 검색과 벡터검색을 결합한 hybrid retrieval 개념을 실험한다.
목표 3답변 신뢰도를 높인다
문서에 없으면 모른다고 답하게 하는 프롬프트와 출처 강제 템플릿을 만든다.
잘못된 답변 사례를 수집해 검색 실패, 프롬프트 실패, 원문 품질 문제로 분류한다.
사용 플랫폼Python, LangChain, LlamaIndex, Chroma, FAISS, Ragas 또는 DeepEval, pandas
강사 스펙RAG 평가, retrieval 튜닝, hallucination 분석 및 개선 지도 경험 4년 이상
수업대상RAG 기본 구현 경험자, AI 챗봇 품질관리 담당자, 프로젝트형 학습자
소요시간20-30시간
준비물평가용 문서셋, 질문/정답 엑셀표, 벡터DB 실험환경, 품질평가 템플릿
산출물RAG 평가 질문셋, 검색 튜닝 리포트, 실패사례 분석표
평가방법평가설계 25%, 검색개선 30%, 답변검증 25%, 분석표 10%, 발표 10%
중급 · 4주

업무문서 RAG 서비스 과정

사내 문서 검색과 답변 기능을 갖춘 업무형 RAG 서비스를 만든다.

구분세부 내용실천·실습 방법
목표 1문서 수집 파이프라인을 만든다
폴더 감시 또는 업로드 방식으로 PDF, DOCX, XLSX를 수집하고 메타데이터를 부여한다.
문서명, 작성일, 부서, 권한등급을 metadata로 저장해 필터 검색을 실습한다.
목표 2서비스 UI를 구축한다
Streamlit 또는 FastAPI 웹화면에서 문서 업로드, 질문, 답변, 근거 확인 기능을 만든다.
사용자가 근거 문단을 클릭하면 원문 위치를 확인할 수 있도록 출처 링크 구조를 설계한다.
목표 3운영 기준을 문서화한다
문서 업데이트 주기, 재색인 조건, 삭제 처리, 권한 제한, 로그 보관 정책을 정한다.
실제 운영 상황을 가정해 오래된 문서와 충돌 문서가 있을 때의 답변 정책을 만든다.
사용 플랫폼Python, FastAPI, Streamlit, LangChain, Chroma, PostgreSQL, Docker, unstructured, python-docx, openpyxl
강사 스펙업무문서 RAG, 파일 파이프라인, 권한 메타데이터 설계 경험 4년 이상
수업대상기업 문서관리팀, 교육자료 챗봇 제작팀, 공공·민간 내부 QA 프로젝트팀
소요시간40-60시간
준비물부서별 샘플 문서, 테스트 사용자 권한표, 서버 또는 Docker 환경, 운영정책 양식
산출물업무문서 RAG 서비스, 문서 색인 파이프라인, 운영정책 문서
평가방법파이프라인 25%, 서비스UI 30%, 메타데이터 20%, 운영정책 15%, 발표 10%
심화 · 8주

RAG 실무 포트폴리오·배포 과정

평가·보안·배포 기준을 갖춘 RAG 프로젝트를 완성한다.

구분세부 내용실천·실습 방법
목표 1고급 검색 구조를 설계한다
query rewrite, multi-query retrieval, reranker, metadata filtering을 조합한 검색 구조를 설계한다.
일반 검색과 고급 검색의 정확도, 응답시간, 비용을 비교하는 실험표를 만든다.
목표 2보안형 RAG를 구현한다
사용자 권한에 따라 검색 가능한 문서가 달라지도록 metadata 필터를 적용한다.
민감정보가 답변에 노출되지 않도록 마스킹, 금칙어, 로그 비식별화 절차를 만든다.
목표 3최종 배포 제안서를 작성한다
Docker Compose 기반 배포, 백업, 모니터링, 재색인, 장애 대응 흐름을 문서화한다.
최종 발표에서 품질평가 결과, 보안정책, 운영비, 확장 계획을 포함해 제안한다.
사용 플랫폼Python, LangChain, LlamaIndex, Chroma 또는 Qdrant, rerankers, FastAPI, Docker Compose, PostgreSQL
강사 스펙고급 RAG 아키텍처, 권한 기반 검색, Docker 배포 및 품질평가 경험 5년 이상
수업대상AI 개발자, 기업 AI 리더, RAG 서비스 구축팀, 취업 포트폴리오 심화반
소요시간80-120시간
준비물권한별 문서셋, 테스트 계정, GPU/CPU 서버, 배포 템플릿, 품질평가 기준표
산출물배포형 RAG 서비스, 품질평가 리포트, 보안 설계서, 도입 제안서
평가방법고급검색 25%, 보안구현 25%, 배포설계 25%, 품질평가 15%, 발표 10%